MedResearchBench: A Multi-Domain Benchmark for Evaluating AI Research Agents on Clinical Medical Research
이 논문은 기존 벤치마크가 간과한 임상 의학 연구의 고유한 복잡성을 해결하기 위해, NHANES 와 SEER 데이터를 기반으로 7 개 임상 분야와 6 가지 평가 차원을 포함하는 최초의 AI 연구 에이전트 평가 벤치마크인 'MedResearchBench'를 제안하고 그 유효성을 입증합니다.